Type: entity
Confidence: 0.95
Created: 2026-04-18
Updated: 2026-04-18
Tags: 机器学习深度学习计算机视觉论文

Gradient-Based Learning Applied to Document Recognition (1998 论文)

概述 (50-200字符)

LeCun、Bottou、Bengio、Haffner 于 1998 年在 Proceedings of the IEEE 发表的 46 页论文,提出 LeNet-5 架构,确立了卷积神经网络的完整框架,在手写数字识别上实现商业部署。

关键内容 (≥300字符, 用双链)

  1. 核心动机:传统全连接网络将 28×28 图像展平为 784 维向量,连接到 1000 神经元需 784,000 参数,且完全忽略像素的空间位置关系。论文提出图像数据具有两个重要先验——局部性(相邻像素高度相关,有用特征是局部的如边缘、角点)和平移不变性(猫在图像左边和右边都是猫),网络结构应反映这些先验知识。
  2. 三大核心操作卷积层用小的卷积核(如 5×5)在整张图上滑动,同一卷积核在全图共享权重,参数从 O(H·W·N) 降到 O(k·k·N),学到的特征具有平移不变性;池化层对特征图做空间降采样,减少计算量并增强平移鲁棒性;全连接层在末端进行高级语义特征组合与分类。
  3. LeNet-5 完整架构:输入 32×32 灰度图 → C1(6个 5×5 卷积)→ S2(2×2 平均池化)→ C3(16个 5×5 卷积,部分连接)→ S4(2×2 平均池化)→ C5(120个 5×5 卷积)→ F6(84 神经元全连接)→ Output(10 类 RBF 单元),总参数量约 60,000,在 MNIST 上达到约 99% 准确率。
  4. 历史影响:该论文是 卷积神经网络(CNN) 完整框架的奠基之作。LeNet-5 在手写识别上直接商业部署,所有现代 CNN 都是其直接祖先。14 年后 AlexNet(2012)继承了这一架构思路,用 ReLU激活函数 替代 Sigmoid激活函数、最大池化替代平均池化、GPU 替代 CPU,在 ImageNet 上取得突破。

来源

相关